融合算子：Power-Sigmoid-Affine-Gate（一次核内完成仿射、幂变换与 Sigmoid 门控，返回 y = x * σ(α * |z|^p + β)，其中 z = x*scale + bias，p>0）。通过控制 p 可调节非线性强度，适合幅值敏感的门控。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`、`power=p`
- 计算流程：`z = x*scale + bias`，`v = |z|^p`（建议 `exp2(power * log2(|z|))` 实现），`g = sigmoid(alpha*v + beta)`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：参考 `Model` 含 `power`；`get_inputs()`/`get_init_inputs()` 统一接口
- `cudacode.py`：单核融合（仿射+幂+sigmoid+乘法）；建议 `exp2f(power*log2f(|z|))` 以获得 `--use_fast_math` 下更高吞吐；`-O3 --use_fast_math`
- `run_code.py`：100 次迭代；精度 `rtol=1e-03, atol=1e-06`；输出加速比

CUDA 实现要点
- 行并行：`grid = B`，块内沿 D 连续访存；只遍历一次并写 `y`
- 对齐向量化：满足 16 字节对齐且 `D%4==0` 时走 `float4`；否则标量路径；两路径计算保持一致
- 指令优化：仿射用 `fmaf`；幂变换走 `log2f/exp2f`；sigmoid 用 `expf`；循环 `#pragma unroll 4`
- 零值处理：当 `|z|=0` 时，`log2f(0)=-inf`，`exp2f(-inf)=0`，最终 `v=0`，该分支数值稳定
- 线程配置：推荐 `block=1024` 起步，按设备试探最佳值

评估与目标
- 精度：与 PyTorch 参考对齐（`rtol=1e-03, atol=1e-06`）
- 性能：融合与向量化后期望 ≥1.0x；大尺度更优

加分项（可选）
- 针对未对齐路径减少尾循环与分支开销
- 在 p 为常量时进行常量传播或近似优化（谨慎控制误差）

